学习模式

【提示词创作第六十一节】不用死磕长提示词:用 Codex 自动完成任务

2周前 让任务自动落地 作者:西瓜
Codex
任务提示词
Agent Skills
上下文
任务拆解
自动化
视频粗剪
小游戏
导语:让任务自动落地

很多人第一次看到 Codex,会把它理解成“帮程序员写代码的软件”。但对普通创作者来说,更值得学习的是它处理任务的方式:读取资料、理解目标、调用工具、执行步骤、检查结果,再根据反馈修改。

本节学完后,你应该能把一个模糊想法整理成一张可执行任务单,并用同一套方法完成短剧策划、视频粗剪、小游戏制作等不同工作。

一、理解 Codex 的工作方式


为什么同一句“帮我做一个短剧”,普通聊天工具可能只给你一段文字,Codex 却可以继续读取资料、创建文件、调用工具并检查结果?

因为 Codex 的重点不是只回答问题,而是执行任务。一个完整任务通常包含五层:

本次目标:这一次具体要做什么,例如制作古风短剧。

原始资料:角色图、文稿、视频、表格或项目文件放在哪里。

固定方法:人物设计、剧本结构、分镜和提示词应该按什么规则制作。

执行工具:需要用到文件、命令、浏览器、剪辑软件或已连接的办公工具。

验收标准:最终交付哪些文件,检查哪些错误。

其中,普通任务消息负责说明“这次做什么”;Skill 负责保存“以后遇到这类任务都怎么做”。如果没有 Skill,你每次做短剧都要重新解释人物卡、三幕结构、镜头表和提示词格式;有了 Skill,这些固定规则只需整理一次,后面只补充本次题材、角色和时长。

例如以下就是本次会用到的skill:

skill不是一个神奇按钮,而是一份可复用的操作说明。它可以包含步骤、规则、参考文件和脚本,适合写短剧、制作商品图、整理采访、检查课件等反复发生的工作。



二、安装Codex


点击这个链接打开官网:

https://openai.com/codex/

点击下载

随后选择一个方式登录就行



三、用 G·C·S·D 写出可执行任务


一条稳定的 Codex 任务,可以用四部分表达:

G,Goal 目标:最终要完成什么。

C,Context 上下文:需要读取哪些文件、图片、视频或参考资料。

S,Steps / Skill 步骤与技能:应调用什么技能,遵守哪些规则,按什么流程推进。

D,Done 完成标准:输出什么文件,检查哪些问题,什么状态才算结束。

这四项不一定要写成表格,也不要求很长。它们的作用,是减少 Codex 的猜测空间。

“做得高级一点”“节奏好一点”都不能直接验收。把它们换成“60 秒竖屏”“前三秒出现结果”“不重复镜头”“输出工程文件和成片”,任务才真正可执行。



四、Codex 的九类实用玩法


九类玩法看起来不同,底层都是读取资料、调用工具、执行任务和检查结果。

这些玩法看起来跨度很大,底层却是同一件事:Codex 先读取资料,再调用当前环境允许使用的工具,执行任务并检查结果。区别只在输入资料、工具和验收标准。

1. 自动生成 AI 短剧

适合把一个故事想法推进到人物设定、剧本、分镜和逐镜画面提示词。你需要提供题材、时长、角色参考和风格;Codex 负责调用编剧或导演 Skill,按固定步骤生成中间成果。不要直接要求最终成片,先验收人物卡和分镜。后文会完整拆解。

2. 自动剪辑视频

把所有原始素材、旁白和参考成片放进文件夹,再写清主题、时长、比例和节奏。Codex 可以先生成素材清单,挑选候选片段,再调用可用剪辑工具完成粗剪。验收时检查黑帧、断音、重复镜头和字幕遮挡,而不是只看“有没有导出视频”。

3. 自动生成游戏

先描述核心玩法、操作方式、美术风格和通关或经营循环。Codex 先做最小可玩版本,实际运行后再根据反馈添加任务、商店、存档和角色系统。《暖谷日记》就是这一玩法的完整案例,后文会展示真实运行画面。

测试案例

4. 制作网站和 App

可以从一句业务目标开始,逐步生成页面结构、界面样式、交互逻辑和数据功能。例如:

我先找了一张图片作为ui风格的参考

并输入:

“帮我想一个可以记录打卡健身的APP,参考这个ui设计风格”

codex调用了image2.0生成了这一套UI界面

随后,直接让codex生成可操作的APP界面

测试案例

5. 批量管理本地素材

适合整理上百张图片、视频或文档:读取文件信息、按项目分类、统一命名、查找重复项、生成素材清单。安全做法是先让 Codex 输出“计划改名表”和“疑似重复文件表”,确认后再移动或删除。

测试案例

6. 帮你清理 C 盘

这里的“清理”应该理解为分析占用并协助安全处理,不是让 Codex 随意删除系统文件。它可以统计大文件、缓存、下载目录和重复安装包,先给出容量与风险清单。

prompt:

分析 C 盘空间占用,列出最大的文件夹和可安全清理的候选项。 第一阶段只生成报告,不删除任何内容。 系统目录、软件运行文件、个人项目和不确定文件一律保留; 等我确认具体项目后再执行清理,并记录释放空间。

测试案例

7. 操作飞书办公

在已经连接飞书工具或浏览器、并获得相应权限时,Codex 可以整理文档、汇总表格、生成会议纪要、更新任务或把资料写入指定页面。任务必须说清工作区、目标文档和允许修改的范围。

8. 自动安装软件和工具

Codex 可以先检查电脑里已经有什么,再选择合适版本完成下载、安装、环境变量配置和运行验证。

测试案例

9. 制作专属 Skill

当同一套工作重复两三次,就可以把方法封装成 Skill。例如,把“读取口播稿、提炼教学目标、制作标注图、写教程、检查网页”变成固定流程。以后只需提供新素材,Codex 就能按同一标准执行。

比如一下是我制作教程的一系类流程,

我可以直接让Codex将其总结成一套skill

测试案例



五、案例一:上传三个 Skill,一句话生成 AI 短剧


这个玩法实际那么复杂。你不需要自己依次写人物卡、场景表和剧本,也不用每一步单独指挥。真正的操作只有三件事:上传三个 Skill 文件、用一句话说出故事想法、要求 Codex 按 Skill 自动执行。

你负责说创意,三个 Skill 分别负责剧本、人物和场景

三个 Skill 分别负责什么

短剧编剧 Skill:负责题材、受众、人物关系、故事骨架、分集目录和完整剧本。简单理解,它回答“这部短剧讲什么”。

人物 Skill:负责人物身份、年龄、气质、服装、妆容、表情、电影感画面和图生视频风格。简单理解,它回答“人物应该长什么样”。

3×3 场景 Skill:负责府邸、闺阁、书房、庭院等空间,输出建筑、陈设、道具、光线和九宫格场景提示词。简单理解,它回答“故事发生在哪里”。

复制链接至网址粘贴,自动下载

../assets/attachments/6a2fd45506ea2-7952e13ef57d.rar

小白实际怎么操作

打开一个新任务,把三个 .md 文件一起上传,然后说出大概想法:

prompt:

依据这三个skill,相互协作,按照这个故事给我一个90s的短剧 《替嫁小医女》

江南医女苏晚被迫替姐姐嫁入将军府。传闻那位少年将军冷血无情,刚从边关归来,满身杀气,不近女色。
可新婚夜,她发现将军身中奇毒,命不久矣。为了保命,她只好假装贤妻,暗中替他医治。
将军起初怀疑她是细作,处处试探。后来却发现,这个看似柔弱的小医女,能救人,也敢杀人。
核心爽点:替嫁、医女、冷面将军、互相试探、日久生情。

AI会先给出一套剧本,你可以对话更改。


剧本满意后,使用这段提示词,让AI生成人物、场景提示词(要强调人物提示词是白底定妆照)。

提示词生成后,你可以直接让他调用image2.0生成图片

随后让AI给出详细的剧情以及分镜脚本。

有了分镜脚本,再让AI生成一套适合于seedance2.0的视频提示词。

prompt:

依据分镜脚本,给我符合seedance2.0的视频提示词,不用标注时间,只需要标注分镜

再让AI生成画面氛围提示词以及色板提示词:

prompt:

>并且给我符合女频向的画面氛围质感还有色彩提示词。

这样视频提示词就生成完毕了

随后打开flow https://labs.google/fx/tools/flow

使用nanobanana pro去生成人物的三视图。(为什么不用image2.0去生成呢?因为image2.0的效果不够好,不够真实,会很油)

输入这段提示词:

生成人物的面部三视图,生成图中人物的真人形象三视图,白底图,左侧部分展示了角色的精细真人半身特写肖像。其面部特征、骨骼结构、神态表情、发型及头部配饰必须与 严格一致,呈现自然的皮肤纹理、毛孔和发丝细节。右侧部分展示了该角色完全相同的全身真人照片,呈标准 A-pose 站姿,并以精确的三视图排列:正视图、侧视图和背面图。超模的身体比例、完整的服装设计、布料层次、鞋子及整体穿搭风格必须严格遵循。所有服装和配饰均呈现真实的物理材质质感。

随后打开即梦去生成视频

只要上传人物三视图,场景图,然后输入提示词(氛围色彩提示词+视频提示词)即可。

这段视频的提示词如下:

古风女频情感短剧质感,真实真人古装剧电影画面,东方含蓄审美,危险暧昧、克制拉扯、先婚后爱氛围。画面重点始终落在男女主的眼神交锋、呼吸距离、手部接触、衣袖摩擦和细微表情变化上。男主冷峻克制、有保护感和压迫感,但不油腻邪魅;女主清醒聪慧、柔中带锋,在亲密距离中保持主动权。
竖屏9:16构图,优先使用双人中近景、侧面近景、眼神特写和手部特写。利用朱红纱幔、喜帕、屏风边缘作为前景遮挡,形成含蓄的窥视感与空间层次。人物脸部清晰,背景适度虚化,浅景深,柔和焦外光斑,真实镜头呼吸感。构图精致但不摆拍,像古装剧中的关键剧情瞬间。
真实自然的东方人脸,保留皮肤纹理和面部骨相,柔和但不磨皮,眼睛有湿润高光但不泪眼泛滥。女性妆容清透、低饱和、古典,男性妆容干净冷峻。真实丝绸、织锦、绛纱、深木和冷铁材质,衣料有重量,发丝与流苏只做克制微动。
光线采用暖色烛光与冷青月光双光源。暖光柔和照亮人物面部与朱红嫁衣,冷光勾勒男主黑衣轮廓和危险感。面部保持柔和明暗过渡,眼神区域清楚,避免大面积死黑。红纱透光、烛火散景、少量香烟与空气尘埃增加电影层次。整体低饱和、低明度、暖冷对比,华贵而不艳俗,甜而不腻,欲而不露。
镜头运动克制平稳,以缓慢推进、轻微侧移、小幅环绕和稳定跟随为主。动作场面短促清楚,情感场面放慢,保留停顿和对视。画面具有高级古装剧布景质感,不使用仙侠滤镜、网红磨皮、廉价影楼红色滤镜或过度柔焦。

不要生成任何字幕,文字,文案。 不要生成任何bgm,但是要保留音效
图片1 苏晚定妆照:锁定苏晚的脸型、发型、朱红嫁衣、青绿内衫、银针发簪和深青药囊。
图片2 萧承烬定妆照:锁定萧承烬的脸型、束发、黑色将军服、暗金甲片、冷铁护腕、青黑毒线和长剑。
图片3婚房场景图:锁定明式将军府婚房、朱红喜字屏风、拔步床、侧窗、烛光与冷月光。
分镜01参考图片3@婚房场景图。极近景固定镜头,朱红喜帕自然垂落并占满画面,布料纹理清晰。一柄带有少量干涸血迹的长剑从画面下方缓慢探入,剑尖停在喜帕边缘,动作克制稳定。背景虚化,只保留暖色烛光。音效为远处轻微甲胄碰撞声与低沉剑鸣。
分镜02参考图片1苏晚定妆照、图片2萧承烬定妆照和图片3婚房场景图。苏晚盖着朱红喜帕,端坐在喜床前,正面中近景,右手藏在宽袖中,指间露出一点银针尖。萧承烬只以黑色衣摆和长靴进入前景,在她面前停下。苏晚身体保持不动,手指轻微收紧。镜头稳定,浅景深。音效为沉稳脚步、衣料摩擦和安静呼吸。 分镜03
参考三张素材,保持人物与服装一致。低机位特写跟随长剑,萧承烬用剑锋缓慢挑起苏晚的喜帕,红纱沿剑身自然滑落,露出苏晚平静警觉的面容。剑锋继续向上,轻轻托住她的下颌。镜头动作缓慢清楚,突出金属、红纱和眼神。音效为剑锋擦过珠饰的清脆声。 分镜04
参考三张素材。双人侧面近景,萧承烬俯身逼近苏晚,剑锋托住她的下颌,两人的脸距离很近。苏晚不后退,平静抬眼与他对视。镜头极慢推进,捕捉压迫感和克制暧昧。萧承烬冷声说:“苏锦右手虎口有痣。你没有。”要求中文口型自然准确。背景只有轻微摇动的红纱与烛光。 分镜05
参考三张素材。苏晚主观视角,前景剑锋虚化,焦点平稳转移到萧承烬握剑的手腕,冷铁护腕下露出一条向手肘蔓延的青黑毒线。随后焦点回到苏晚清醒的眼睛。苏晚平静说:“将军新婚夜验新娘,还是验尸?”中文口型自然。突出细节判断,不使用剧烈运镜。



六、案例二:把素材放在一起,让 Codex 操控鼠标粗剪


这个玩法也很直接:把视频素材放进同一个文件夹,告诉 Codex“帮我粗剪一下”,它会查看素材,并通过电脑控制能力操作剪辑软件。

什么叫粗剪

粗剪不是最终成片。它主要把素材导入软件、删除明显无效部分,再把剩余片段大致排到时间线上。字幕特效、音乐卡点、精细调色和情绪节奏通常还需要人工继续处理。

小白实际怎么操作

先把素材集中在一个文件夹内

直接与codex说

查看当前文件夹里的全部视频素材,帮我完成一版粗剪。 请打开剪辑软件,通过鼠标和键盘把素材导入并排列到时间线上。 删除黑屏、明显失焦、重复和完全无效的片段。 不要删除或覆盖原始素材。 完成后停在剪辑时间线,让我检查。

Codex 实际怎么剪

Codex 会像人一样打开剪辑软件、点击导入、浏览文件夹、拖动素材、移动时间线和执行剪切。不是剪辑软件突然有了一个万能按钮,而是 Codex 在代替鼠标和键盘。

必须讲清楚的真实缺点

目前这种鼠标粗剪速度很慢,效果也比较一般。

逐步识别界面、点击和拖动,远慢于专业剪辑师。

素材越多,查看和选择耗时越长。

能处理明显黑屏、重复和无效片段,但对情绪、笑点、卡点和高级节奏判断有限。

时间线复杂后,鼠标拖动可能不够精确。

在 Windows 操作桌面软件时,通常会占用前台鼠标键盘。

因此它适合做第一版粗剪或展示 Codex 能操控电脑,不适合宣传成一键得到专业成片。



七、案例三:粘贴一段提示词,Codex 直接生成《暖谷日记》


操作步骤:粘贴一段完整提示词,让 Codex 先采访你;需求确定后,它会直接在当前工作区创建文件、运行游戏、测试并修复。

先回答几个问题,之后由 Codex 主动完成开发

实际使用的完整提示词:

我想做一个星露谷物语类似的小游戏
你是一名资深独立游戏开发者、游戏策划和 UI 设计师。请与我合作,从零制作一个可以实际运行和游玩的小游戏。
我目前只有一个初步想法,你需要先通过提问帮助我完善它,然后直接在当前工作区完成开发。
工作流程:
第一阶段:需求访谈 请一次只问我 1~3 个最重要的问题,根据我的回答继续追问。至少确认以下内容:
1. 游戏类型和核心玩法 2. 参考游戏,例如《贪吃蛇》《星露谷物语》 3. 运行平台,例如浏览器、Windows、macOS 或手机 4. 单局时长和目标玩家 5. 美术风格、颜色和氛围 6. 操作方式 7. 必须包含的功能 8. 我能接受的开发规模
不要一开始提出大量问题。遇到我不确定的地方,请提供 2~3 个具体选项,并推荐一个最适合快速完成的方案。
第二阶段:确定方案 访谈完成后,请整理出:
- 一句话游戏介绍 - 核心玩法循环 - 操作方式 - 胜利、失败或成长条件 - 功能清单 - 技术方案 - 美术与音效方案 - 第一版明确不做的内容
如果我的设想规模过大,例如想完整复刻《星露谷物语》,请主动缩小为可完成、可游玩的 MVP,但保留最有趣的核心体验。
第三阶段:开始开发 方案确定后,不要只给我教程或代码片段,请直接:
1. 检查当前工作区和已有项目 2. 选择合适且尽量简单的技术栈 3. 创建并修改所需文件 4. 完成一个可以运行的游戏 5. 优先使用简单可靠的实现,避免不必要的复杂架构 6. 加入清晰的开始界面、游戏界面、暂停、重新开始和基本提示 7. 保证键盘操作可用,并尽可能兼容触屏 8. 根据玩法加入分数、状态、存档或成长系统 9. 处理边界情况,避免游戏卡死 10. 不使用有版权风险的素材;需要素材时,使用原创、程序生成或明确可商用的资源
第四阶段:测试与打磨 开发完成后,请:
- 启动游戏并实际测试 - 检查控制台错误 - 测试开始、暂停、失败、胜利和重新开始流程 - 检查常见屏幕尺寸下的显示效果 - 修复发现的问题 - 对画面、反馈和操作手感做一轮打磨
最终告诉我:
- 游戏完成了哪些功能 - 如何启动和游玩 - 主要文件在哪里 - 当前版本有哪些限制
合作规则:
- 在需求尚不明确时先提问,不要擅自开始制作 - 需求确认后主动执行,不要每一步都等待我批准 - 不要停留在规划阶段,要完成可运行版本 - 每完成一个重要阶段,给我简短进度说明 - 如果遇到技术问题,先自行调查和尝试解决 - 控制第一版规模,先做到“完整、好玩、能运行”,再考虑增加内容
现在请开始需求访谈。先问我最重要的第一个问题。

随后会让你不断的回答问题,回答问题阶段,你可以将你想要参考的风格图片也一起回答。

等待AI自己生成即可。

等待10分钟后这就是AI生成的游戏界面。

此时还有些简陋,这时候,上传你的参考图,然后去调用image2.0去生成图片素材。

prompt:

现在的ui与画面过于简陋的了,我给了你多个参考图,按照参考图的风格,调用image2.0模型,生成游戏中所需的资产。包括ui,人物,地图,工具,房子,种子,树苗,等等

这才是 Codex 制作小游戏最重要的玩法:不是要求你会写代码,而是先用访谈把想法说清楚,然后试玩成品,继续告诉它哪里需要修改。



结语


学会 Codex,不等于背更多术语,也不等于写一篇很长的提示词。真正有用的能力,是把想法整理成可执行、可检查、可继续修改的任务。



速用卡

视频生成执行卡

把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。

一句话重点

这节课不是先追求炫技成片,而是围绕「不用死磕长提示词:用 Codex 自动完成任务」先把主体、动作、镜头和节奏稳住。

落地顺序

按原文节奏走最稳:先吃透「理解 Codex 的工作方式」,再把「安装Codex」定住,接着处理「用 G·C·S·D 写出可执行任务」;最后用「Codex 的九类实用玩法」收口。

照着做清单
  1. 先把「理解 Codex 的工作方式」里的主体和动作定死。
  2. 这一段重点看镜头和节奏,别急着炫技。
  3. 做完「用 G·C·S·D 写出可执行任务」后,先查连贯性和穿帮。
  4. 先把「Codex 的九类实用玩法」里的主体和动作定死。
  5. 把「案例一:上传三个 Skill,一句话生成 AI 短剧」整理成可复制版本,后面直接复用。
  6. 做完「案例二:把素材放在一起,让 Codex 操控鼠标粗剪」后,先查连贯性和穿帮。
最容易踩坑

不要一上来就生成最终片;先拆镜头、定主体和运动,再逐段生成,否则容易跳轴、穿帮、节奏混乱。

成品自检

检查主体是否稳定;镜头运动是否明确;前后画面是否连贯;节奏是否服务主题;是否有明显变形或穿帮。

可直接复制的万能模板
请围绕「不用死磕长提示词:用 Codex 自动完成任务」帮我做一个可直接执行的方案。
我的目标是:【填写你的具体目标】
我的素材/产品/角色信息是:【填写已有素材和限制】

请输出:核心创意、分镜表、每个镜头的画面描述、视频生成提示词、剪辑顺序和成片自检清单。要求主体稳定、动作明确、镜头连贯。